
Liquid AI 推出 LFM2.5-DSpark 草稿模型,能大幅提升人工智慧模型的解碼速度,最高可達 3.18 倍,且不影響輸出準確度,對獨立開發者與新創公司提供免費商業授權,有助於加速 AI 應用落地。
Liquid AI 於昨日(2026年8月20日)發布了 DSpark 草稿模型(draft model)檢查點,為其 LFM2.5 系列中的三款模型提供加速。此舉號稱在不改變模型輸出結果的前提下,能將人工智慧(AI)的解碼速度(指 AI 模型生成回覆所需的時間)提升最高達 3.18 倍。此系列包含 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 以及 LFM2.5-8B-A1B 三款模型。
DSpark 技術的核心在於為現有的目標模型增加一個推測性解碼路徑(speculative decoding path)。它利用一個約 3 億參數的草稿模型,預先提出九個候選 Token(AI 處理語言的最小單位),然後目標模型在一次前向傳遞(forward pass)中驗證整個候選區塊。這種方法雖然會略微增加記憶體使用量,卻能大幅提升解碼速度。根據報導,該技術在 NVIDIA H100 GPU 上最高可加速 3.18 倍,在 Apple M4 Max MacBook Pro 上則可加速 2.87 倍。由於發出的序列與單獨運行的目標模型完全相同,基準測試的準確度不受影響。
這項技術已獲得 llama.cpp 和 SGLang 這兩個開源框架的支援,其權重(weights)以 Safetensors 和 GGUF 格式發布。開發者若要運行這些模型,需使用支援 DSpark 的 SGLang 或 llama.cpp 版本。
Liquid AI 的 LFM Open License v1.0 規定,年營收低於 1,000 萬美元的實體可免費將此技術用於商業目的。這涵蓋了獨立開發者、新創公司和中小型企業。大型企業則需要事先與 Liquid AI 聯繫以取得商業授權。
DSpark 的應用範圍廣泛,包括本地程式開發助理、在裝置上運行並在每次工具調用前進行推理的代理程式、單一用戶聊天應用程式,以及在筆記型電腦等級硬體上運行的離線副駕駛等。此外,它也能應用於需要將資料保留在本地的醫療、金融和國防工作負載。
值得注意的是,LFM2.5-8B-A1B 模型在 Apple M4 Max 上的加速效果較不明顯,平均僅為 1.18 倍。Liquid AI 將此歸因於 llama.cpp Metal 後端目前對 MoE(Mixture of Experts)架構的實作方式,以及驗證多個 Token 時會啟動更多專家模型,導致更多的權重傳輸。儘管如此,在多工具函式呼叫(multi-tool function-calling)情境下,DSpark 仍能平均將 LFM2.5-2.6B 的延遲降低 57%。整體而言,這項技術的加速效果會根據工作負載的預測性而有所不同,範圍從 1.04 倍到 3.18 倍。
